Sino-US-DrugQA: A Benchmark for Evaluating Large Language Models in Cross-Jurisdictional Pharmaceutical Regulation
该研究提出了名为 Sino-US-DrugQA 的双语基准数据集,通过包含 11,871 个基于中美药监法规的问答对,系统评估了大语言模型在跨司法辖区药物监管合规中的表现,发现尽管模型在单语查询中表现尚可,但在跨辖区对比推理任务上仍存在显著差距,表明当前技术尚需专家复核以支持高风险场景的部署。